Das Mittelstand-Digital Zentrum Fokus Mensch entwickelt daher einen Demonstrator für ein nutzerzentriertes Evaluationsframework von großen Sprachmodellen (Large Language Models, LLMs).
Der Evaluations-Demonstrator ermöglicht es, eigene Prompts gleichzeitig an mehrere Sprachmodelle zu senden, deren Antworten direkt gegenüberzustellen und mithilfe einer fünfstufigen Likert-Skala sowie ergänzender Kommentare zu bewerten. Damit lässt sich die Eignung eines Modells anhand der tatsächlichen Aufgaben eines Unternehmens beurteilen und nicht nur anhand allgemeiner Ranglisten. Gängige automatisierte Evaluationsmethoden wie Multiple-Choice-Tests oder die Bewertung von Sprachmodellen durch andere Sprachmodelle machen zwar Grundfähigkeiten vergleichbar, sind jedoch zu allgemein für individuelle Anwendungskontexte wie medizinische Beratung, Bildung, Recht oder den privaten Haushalt. Auch bestehende nutzerbasierte Tools wie die „Chatbot Arena“ berücksichtigen die konkreten Aufgaben einzelner Nutzerinnen und Nutzer nicht, und verbreitete Metriken sind überwiegend auf die englische Sprache ausgerichtet.
Technische Umsetzung:
Ein erster funktionaler Prototyp des Evaluationswerkzeugs wurde auf Basis von Feldbeobachtungen mit Nutzenden entwickelt und bereits in mehreren Workshops erfolgreich eingesetzt. Die Benutzeroberfläche besteht aus vier zentralen Komponenten: einer Eingabemaske für Prompts, mehreren parallelen Chat-Modulen für die Antworten der Sprachmodelle (aktuell drei), einem Feld für Aufgabentitel und -beschreibung sowie einem Bewertungsbereich mit Likert-Skala und Kommentarfunktion. Um Verzerrungen durch Markenbekanntheit oder eine feste Reihenfolge zu vermeiden, werden die Modellnamen während der Bewertung verborgen und die Position der Modelle randomisiert. Auf Grundlage der gesammelten Bewertungen generiert das System einen Evaluationsbericht, der alle bewerteten Aufgaben in einem Liniendiagramm darstellt und für jede Aufgabe eine detaillierte Tabelle mit dem ursprünglichen Prompt, der numerischen Bewertung, dem Kommentar der Nutzenden und der jeweiligen Modellantwort enthält.
Anpassungsmöglichkeiten:
Der Demonstrator ist modular aufgebaut und lässt sich leicht an spezifische Anforderungen anpassen. Unternehmen können die zu vergleichenden Sprachmodelle frei festlegen, eigene Prompts und Aufgabenbeschreibungen aus ihrem jeweiligen Fachkontext einbringen und die Bewertung an ihren eigenen Qualitätskriterien ausrichten. Da die Evaluation auf den Aufgaben der Nutzenden selbst beruht, ist sie unabhängig von der verwendeten Sprache und damit auch für nicht-englische Anwendungsfälle belastbar.
Einsatzmöglichkeiten in der Praxis:
Der Evaluations-Demonstrator eignet sich besonders für KMU, die Sprachmodelle in ihre Geschäftsprozesse integrieren wollen und vor der Aufgabe stehen, ein geeignetes Modell für ihren konkreten Anwendungsfall auszuwählen. Ebenso relevant ist er für Entwicklerinnen und Entwickler, Beratungen sowie Forschende, die Sprachmodelle systematisch und nutzerzentriert miteinander vergleichen möchten – insbesondere dann, wenn nicht-englische Sprachen oder fachspezifische Anforderungen eine Rolle spielen. Durch den direkten Vergleich mehrerer Modelle an den eigenen Aufgaben können Entscheidungen über den Einsatz von KI auf einer belastbaren Grundlage getroffen werden.
Fazit:
Mit dem Evaluations-Demonstrator bietet das Mittelstand-Digital Zentrum Fokus Mensch KMU ein leistungsfähiges Werkzeug, um die Auswahl von Sprachmodellen an den eigenen Anforderungen statt an allgemeinen Benchmarks auszurichten. Faktoren wie Sprache, Wissensbasis und ein präzises Nutzerverständnis entscheiden darüber, ob ein Sprachmodell für einen Anwendungskontext geeignet ist – der Demonstrator macht genau das systematisch überprüfbar und liefert mit dem automatisch erzeugten Evaluationsbericht eine nachvollziehbare Entscheidungsgrundlage.